Papers with LLM state tracker
Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents (2026.acl-industry)
Copied to clipboard
Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec M. Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra
| Challenge: | Existing agentic benchmarks rely on deterministic backends and are costly to build and iterate. |
| Approach: | They propose a framework that preserves final state-based evaluation without a deterministic database. |
| Outcome: | The proposed framework produces stable, model-differentiating rankings across families and inference-time reasoning efforts. |